메뉴

#합성 데이터

TC
TechCrunch AI • 6일 전
IMP 7

AI 안전 논의, 팩트와 픽션의 경계가 무너졌다

이번 주 앤드류 양 전 대통령 후보가 근거 없는 'AI가 인터넷을 오염시켰다'는 주장을 확산시킨 반면, OpenAI의 노엄 브라운은 에어갭 시스템조차 AI를 막지 못한다는 다소 과장된 우려를 제기했다. 실제 AI 안전 사고들이 워낙 공상과학처럼 들리다 보니 어떤 시나리오든 그럴듯하게 받아들여지는 문제가 커지고 있다는 것이 이 기사의 핵심이다.

AI 안전 OpenAI 합성 데이터
TC
TechCrunch AI • 9일 전
IMP 6

로봇의 '챗GPT 순간'은 언제? 엔비디아 카파스가 밝히는 걸림돌

2022년 11월 챗GPT 등장 이후 AI는 일상이 됐지만, 로봇 분야는 아직 획기적 전환점을 맞지 못했다. 엔비디아 이셉션의 피지컬 AI 글로벌 총괄 레스 카파스는 테크크런치 디스럽트 2026에서 핵심 병목이 '인터넷 규모의 물리 데이터 부재'라고 진단한다. 시뮬레이션·합성 데이터·파운데이션 모델로 이 격차를 메우려는 스타트업 생태계의 시도가 주목된다.

엔비디아 로봇 피지컬 AI
HN
Hacker News • 10일 전
IMP 5

Datamimic – 코딩 에이전트가 마음대로 테스트 데이터를 조작하지 못하게 하라

Datamimic은 규제 산업(금융 등)을 위한 결정론적 합성 테스트 데이터 생성 및 PII 인식 가명처리 오픈소스 엔진입니다. AI 코딩 에이전트가 검증되지 않은 임의 테스트 환경을 만드는 대신, CLI 기반 표준 계약을 통해 데이터 모델을 작성·검증·실행하도록 유도합니다. 커뮤니티 에디션(CE)은 MIT 라이선스로 무료이며, 엔터프라이즈 플랫폼은 PII 스캐너, 감사 로그, 역할 기반 접근 제어 등 거버넌스 기능을 추가합니다.

테스트 데이터 합성 데이터 PII 보호
HN
Hacker News • 30일 전
IMP 7

비디오 모델을 더 빠르고 잘 학습시키는 법

이 글은 이미지·비디오 생성 모델의 성능 향상이 아키텍처 변화가 아닌 데이터 개선(필터링, 어노테이션, 합성 데이터 생성)에서 비롯된다고 분석합니다. 특히 2024년 CPU 기반 전통적인 컴퓨터비전 알고리즘(PySceneDetect 등)으로 수백억 개의 이미지·비디오를 저비용으로 필터링한 실무 경험을 소개합니다. 자체 생성 모델을 학습시키려는 실무자에게 실용적인 가이드가 될 수 있습니다.

비디오 생성 데이터 필터링 디퓨전 모델
TC
TechCrunch AI • 36일 전
IMP 6

AI 데이터 스타트업 마이크로1, 연 매출 런레이트 5억 달러 돌파

AI 학습 데이터에 대한 폭발적 수요에 힘입어 데이터 라벨링 스타트업 마이크로1(Micro1)이 8개월 만에 총연 매출 런레이트를 1억 달러에서 5억 달러로 확대했습니다. 순매출 기준 1억 5천만~2억 달러로 여전히 머코어(Mercor, 20억 달러)나 핸드셰이크(Handshake, 10억 달러)보다는 뒤지지만, 시장이 여러 업체를 수용할 만큼 충분히 크다는 점을 보여줍니다.

데이터 라벨링 AI 학습 데이터 스타트업
TD
The Decoder • 37일 전
IMP 8

AI 선구자 서튼, 합성 데이터는 '큰 실수'라고 비판

튜링상 수상자이자 강화학습의 창시자로 꼽히는 리처드 서튼(Richard Sutton)은 세계가 무한히 복잡하기 때문에 어떤 시뮬레이션도 현실을 충실히 재현할 수 없으며, 합성 데이터(synthetic data)로 대형 언어모델의 확장 한계를 돌파하려는 접근은 '큰 실수'라고 주장했다. 대신 인간을 개입시키지 않고 에이전트가 직접 경험하며 자신만의 세계 모델을 학습하고 지속적으로 수정하는 방식을 제안했으며, 학습 후 가중치가 고정되는 현재 언어모델의 한계를 지적하고 'Continual Backprop' 등 지속적 학습 방법의 필요성을 강조했다.

리처드 서튼 합성 데이터 강화학습